Mô hình ngôn ngữ MM1 mới của Apple có thể hiểu được nội dung, đối tượng, chủ thể và bối cảnh của một bức ảnh để trả lời các câu hỏi liên quan.